AI Inference

LLM 推理解耦架构:Prefill-Decode 分离的生产级吞吐工程实践

深入分析 LLM 生产中 Prefill-Decode 阶段的计算特征差异导致的资源冲突问题,系统阐述 Disaggregated Inference 架构的拓扑设计、KV Cache 传输协议实现,并给出 Prefill Worker、Decode Worker、传输引擎和智能调度器的完整生产级代码实现。包含四路 A100 实测性能基准与架构演进方向。

Linux kernel io_uring 自适应轮询与 Deadline 调度 — 从 EXT_ARG 到 AI 推理延迟 SLO 工程实践

深入探讨 Linux kernel io_uring 的自适应轮询和延迟 SLO 执行机制。从 IORING_ENTER_EXT_ARG 的绝对时间戳语义到 IORING_TIMEOUT_MULTISHOT 的周期性治理,再到 SQPOLL+SQAFFINITY 的 NUMA 拓扑感知绑定,构建完整的 AI 推理延迟 SLO 工程体系,辅以 eBPF 运行时监控和 PI 控制器动态调优。